AI Agents

AI Agent 可以理解为:基于大语言模型的可行动系统。它不只是“会聊天的模型”,而是能够在目标约束下,调用工具、读取环境、维持状态,并持续迭代直到完成任务的系统。

一个便于记忆的抓手

理解 AI Agent,可以记住一句话:感知环境,形成判断,调用工具,拿反馈继续迭代。

也可以压缩成 4 个词:感知 -> 决策 -> 执行 -> 反馈

在生产系统里,你还需要一层“护栏(Guardrails)” ——边界

Agent 是一个系统:它接收目标而非指令,自主控制"感知 → 推理 → 行动"的循环,直到满足成功标准或触发终止条件。

自主性无法填补事实缺口,Agent 只能在已知信息的范围内自主行动

为什么 AI Agent 重要

普通 LLM 更像“单轮回答机器”,而 Agent 更接近“持续完成任务的工作单元”。

当任务需要下面这些能力时,Agent 才真正有价值:

这也是为什么 AI Agent 常被用在 coding agent、research agent、OS agent、自动化工作流和企业助理等场景中。

一个更容易理解的心智模型

如果把 Agent 看成一个“AI 员工”,它大致由 5 个部分组成:

1. 目标

系统先要知道“要完成什么”。目标可以来自用户提示、任务单、工单、环境事件或上一步任务结果。

2. 大脑

通常由 LLM 或 MLLM 负责理解任务、做局部推理、选择下一步动作。

3. 手和脚

也就是工具层,例如:

4. 记忆

包括短期上下文、长期记忆、用户偏好、历史执行记录和中间状态。

5. 反馈回路

Agent 每完成一步,就根据结果判断:

这一层决定了 Agent 和普通问答系统的核心区别。Agent 的本质不是“回答得更像人”,而是“会围绕目标持续行动”。

AI Agent 与普通 Chatbot 的区别

维度 普通聊天模型 AI Agent
目标持续性 通常单轮 多轮持续推进
工具使用 有时调用 工具调用是核心能力
状态管理 强,常带记忆与任务状态
结果形态 回答 行动、产物、任务完成
失败处理 直接结束 会重试、改计划、回退

一句话说:Chatbot 重点在回答,Agent 重点在完成。

AI Agent 的关键组成

1. 规划与编排

当任务复杂时,Agent 往往要先分解问题,再决定调用顺序与执行策略。

其中一个重要理解是:人的工作重心会从“亲自解题”,转向“设计一个让 Agent 能持续逼近正确答案的环境”,除了运行环境本身,甚至可以借助“社区化”,让 Agent 在一个好的社区环境中持续自主进化,比如:让你的 AI Bot 去上学

2. 模型与路由

Agent 系统往往不只用一个模型,而是按任务类型、成本、延迟和质量要求进行分配。

相关笔记:

如果说模型是“大脑”,那么路由系统就是“大脑调度器”。

3. 工具接入

Agent 的可用性很大程度取决于它能调用哪些工具、工具是否可靠、接口是否清晰。

相关笔记:

4. 治理与护栏

一旦 Agent 具备执行能力,就必须考虑权限边界、输入输出控制、内容安全、失败回滚和审计问题。

相关笔记:

5. 观测与评估

Agent 不是“做出来就行”的系统,它的成本、成功率、步骤数、重试路径、失败原因都需要被追踪和评估。

如果没有观测,Agent 系统就会很快变成不可调试的黑箱。

当前最值得关注的几类 Agent

1. Coding Agent

让 Agent 参与代码理解、修改、测试、重构与调试。

相关笔记:

2. OS Agent

直接操作电脑、手机或浏览器环境,通过视觉和工具执行任务。

这类方向在 2025 年开始明显升温,典型特征是:

3. Research Agent

帮助人做检索、筛选、总结、引用整理和研究报告生成。

4. Workflow Agent

接在业务流程里做自动化,例如客服、销售、内容运营、内部知识系统、审批流与数据处理。

5. Personal Assistant / Workflow Agent(OpenClaw)

OpenClaw 更属于个人助理型 Agent 与 Workflow Agent 的结合体,而不是一个纯粹的 OS Agent。

为什么这样判断:

OpenClaw 不是那种“只会操作电脑界面”的 OS Agent,而是一个以个人助理和工作流自动化为核心、再向外扩展多工具与多入口能力的 agent 产品

研究信号与代表案例

OS Agent Survey

MarsCode Agent

Claude Think Tool

现阶段的典型问题

AI Agent 很强,但也还远没有稳定到“可放心托付一切”。现阶段常见问题包括:

所以对 Agent 的判断不能只看 demo,而要看:

怎样更系统地学习 AI Agent

如果把这块内容作为长期主题,比较推荐的阅读顺序是:

  1. 先建立总览
  1. 再理解系统底层
  1. 最后看具体实现与案例

一个适合记忆的总结

AI Agent 不是一个单独的模型,而是一套围绕任务目标组织起来的系统。

它真正困难的地方,不是“模型够不够聪明”,而是下面这些系统问题:

所以理解 AI Agent,最好的方式不是只研究 prompt,而是把它当成“一个由模型、工具、状态、策略和反馈回路共同组成的任务系统”去看。

相关阅读

参考资源